GLU（Gated Linear Unit）融合：将 `a * sigmoid(b)` 一次内核完成，其中输入最后一维大小为 2D，输出为 D。

torchcode.py：参考实现，按最后维切分为 `a` 与 `b`。
cudacode.py：`__global__ void glu_kernel(...)`，按行访问并融合计算，减少内核次数与显存往返。
run_code.py：比较精度与性能（100 次迭代，`rtol=1e-03`）。
